Appearance
Capturing the objects of vision with neural networks
Summary
Problem: 人类视觉能够将场景分解为对象,形成超越感官输入的、稳定的、可预测的对象表征,而当前达到人类水平对象识别性能的深度神经网络模型仍然“束缚于”感官输入,缺乏对象概念,无法进行跨时间整合、因果推理和生成性理解。两个领域(认知科学与计算建模)之间缺乏系统性的对话。 Approach: 本文是一篇综述性论文,系统回顾了认知科学中关于对象表征的行为现象和理论(分组、模态补全、原对象、对象文件、对象永久性、心理模拟等),并对照当前神经网络模型(尤其是前馈卷积网络)的机制与局限,指出两者之间的对应关系和缺失环节。 Finding: 人类对象表征经历了从“束缚于视网膜参考系”的初始分割(分组、模态补全、原对象)到“脱离视网膜参考系”的对象文件/指针阶段,后者具有有限容量、跨遮挡持续性、预测性和生成性。当前前馈卷积网络将“事物”表示为“材料”,缺乏对象概念、循环处理、跨时间整合和生成性结构理解,导致泛化能力脆弱。 Significance: 本文为认知科学家和计算建模者提供了相互理解的桥梁,指出认知文献可以为开发新的实验任务提供起点,这些任务既能揭示人类对象感知机制,又能作为驱动深度神经网络模型发展的基准,最终将“对象”放入“对象识别”中。
Theoretical Framework
- Theoretical tradition: 认知科学中的对象感知理论传统,结合计算神经科学和深度学习建模视角。
- Prior theories built upon: 格式塔知觉组织原则(连续性、邻近性、相似性、闭合性、共同命运等);Marr的视觉计算理论(原始草图、2.5D草图);特征整合理论(Treisman);FINST理论(Pylyshyn的空间索引);对象文件理论(Kahneman等);Piaget的对象永久性理论;贝叶斯推断/生成模型视角下的感知理论。
- Causal mechanism: 感知被概念化为对生成模型的推断过程:先验知识与当前感觉信号在推断过程中融合,产生对象表征。对象表征通过分组(空间整合)、模态补全(推断缺失部分)、对应性计算(跨时间整合)和对象文件(非视网膜参考系中的稳定表征)等机制从感官输入中“解放”出来。
- Key assumptions: 感知是推断过程;对象是物理凝聚性的体现;对象表征是生成性和循环性的;对象文件容量有限;空间是对象个体化的主要维度。
- Theoretical move: 本文综合并应用了认知科学中的对象表征理论,将其与深度神经网络模型机制进行对照,指出当前模型缺乏的关键特性(生成性、循环性、对象中心表征),并呼吁两个领域相互借鉴。这是对现有理论的综合与应用,而非挑战或扩展。
- Scope conditions: 本文聚焦于通用刚体对象的计算机制,但指出这些机制可能在脑中通过领域特异性模块复制,适应不同行为重要对象(如面孔、身体、工具等)的特定属性。
Research Design
本文为综述性论文(review),无实验设计。其“分析单元”是认知科学中的行为现象与理论概念,以及神经网络模型的机制特性。核心“变量”为:人类对象表征的各个阶段(分组、模态补全、原对象、对象文件、对象永久性)与神经网络模型是否具备相应机制(如循环处理、跨时间整合、生成性建模、对象中心表征)。这些概念通过文献中的行为实验证据和模型架构特性进行“操作化”描述。
Data & Sample
N/A(综述论文,无原始数据收集。引用的行为实验证据来自认知科学文献,涉及人类被试,但本文未报告具体样本信息。)
Analytical Strategy
N/A(综述论文,无统计分析。本文采用概念对照和文献综合的方法,将认知科学的行为现象与理论概念映射到神经网络模型的机制特性上,识别缺失环节。)
Results & Findings
- 人类对象表征的多阶段模型:视觉系统首先在视网膜参考系中进行分组(基于格式塔原则、轮廓整合等),形成原对象;随后通过模态补全推断被遮挡部分;最后通过对象文件/指针机制将对象表征脱离视网膜参考系,实现跨时间、跨遮挡的稳定表征。这一过程从“束缚于感官”逐步走向“脱离感官”。
- 对象文件的容量限制与选择性:人类同时维持的对象文件数量高度有限(约3-4个),但可通过灵活资源分配(如降低速度减少空间拥挤时可达8个)扩展。对象文件是注意选择的基本单元,对跟踪对象上的目标检测有处理优势,甚至对完全不可见但记忆中的对象也有效。
- 对象永久性与心理模拟:成人能无显著性能下降地跟踪完全遮挡的对象,表明对象表征具有持久性。心理模拟(如表征动量)显示人类用速度(而非加速度)模拟对象动态,依赖粗略的时空启发式而非精确物理模拟。
- 当前神经网络模型的局限:前馈卷积网络将“事物”表示为“材料”,缺乏对象概念;无法跨时间整合信息以调节当前感知推断;可能不适合将场景解析为对象。这些局限导致模型在跨域泛化时表现脆弱,缺乏人类所具有的生成性结构和因果理解。
- 两个领域的互补性:认知文献提供了丰富的实验任务(如分组任务、模态补全任务、多对象跟踪、违反期望等),可作为开发新基准的起点;神经网络模型则为认知理论提供了机制性实现的可能性。两者结合有望将“对象”放入“对象识别”中。
Limitations
- 认知科学中的对象表征概念(如对象文件、原对象)缺乏完整的机制性说明,尚未在神经网络模型中实现。
- 本文聚焦于通用刚体对象,未深入讨论领域特异性对象(如面孔、身体、工具)的特定机制。
- 当前神经网络模型在动态视觉(视频)上的循环推断仍具挑战性,本文未提供具体解决方案。
- 综述性质决定了其无法提供实证数据来验证所提出的跨领域合作框架的有效性。
Key Contributions
- 系统梳理了认知科学中对象表征的行为现象与理论(分组、模态补全、原对象、对象文件、对象永久性、心理模拟),为计算建模者提供了清晰的认知文献地图。
- 对照了认知概念与神经网络模型机制,明确指出当前模型缺失的关键特性:生成性、循环性、对象中心表征。
- 提出了两个领域相互借鉴的具体路径:认知文献为开发新实验任务提供起点,这些任务可作为驱动模型发展的基准。
- 强调了“将对象放入对象识别”的核心挑战,为未来研究指明了方向。
- 为跨学科合作提供了共同语言和概念框架,降低了两个领域之间的沟通壁垒。
Key Claims
"Human visual perception carves a scene at its physical joints, decomposing the world into objects, which are selectively attended, tracked, and predicted as we engage our surroundings." (Abstract)
"Deep neural network (DNN) models of visual object recognition, by contrast, remain largely tethered to the sensory input, despite achieving human-level performance at labeling objects." (Abstract)
"The cognitive literature provides a starting point for the development of new experimental tasks that reveal mechanisms of human object perception and serve as benchmarks driving development of deep neural network models that will put the object into object recognition." (Abstract)
"Feedforward deep convolutional neural networks can learn static mappings from images to category labels or structural descriptions of the scene. However, the representations in these models remain tethered to the input and lack any concept of an object. They represent things as stuff." (Section: Introduction)
"The perceived world emerges from the confluence in the inference process of prior information and present sensory signals." (Section: Introduction)